昨天我把模糊需求拆成驗收清單,今天接著問一個更危險的問題:清單寫好了,可以直接叫 AI 自己驗自己嗎?
這就像考生交卷後,老師說:「答案你自己改,分數也自己填。」不是完全沒用,但如果最後每一題都被圈成滿分,這張考卷大概只剩情緒價值。
我拿昨天的文章與 Power Apps 驗收清單做一輪示範自查。任務很簡單:
請依正確性、完整性、可追溯性、可使用性、人工修正成本逐項檢查,並說明證據。
AI 很快就能確認文章有標題、小標、表格、五項框架,也能找到「請選取香水類型」、頁尾、圖片位置、儲存與匯出等需求。
但真正關鍵的不是它找到什麼,而是它無法證明什麼。
例如,文章寫了下拉選單要顯示指定文字,AI 可以確認這句需求存在,卻不能只靠文章證明 App 裡真的設定成功;它能判斷文字看起來清楚,卻不能代表第一次使用的人一定看得懂。
如果把「有寫到」誤當成「有做到」,自查就會從驗收變成自我安慰。
這類項目有明確答案,容易重複檢查:
ChatGPT 適合檢查文字、邏輯與清單;Codex 適合實際讀取檔案、執行公式、查看結構或測試功能。這些工作不是百分之百不會錯,但很適合先用機器篩掉低階問題。
這些項目有依據,卻需要情境判斷:
做法不是全盤相信,也不是每個字重做。可以請 AI 標出高風險處,再由人抽查原始資料與關鍵結論。
這些事情不能只靠自動勾選:
AI 可以提醒,但責任不能外包。
第一個漏洞是把文字存在當成成果存在。修正方式:要求附上畫面、計算過程、檔案位置或測試結果。
第二個漏洞是不確定也硬給結論。修正方式:答案只能使用「已驗證、合理推測、無法驗證」三種狀態,不准全部寫完成。
第三個漏洞是自己訂標準、自己宣布及格。修正方式:驗收條件必須在任務開始前先固定,不能看到成果後才偷偷放寬。
| 查核項目 | AI 適合做什麼 | 人要補什麼 |
|---|---|---|
| 正確性 | 重算、比對、找矛盾 | 核對原始資料與情境 |
| 完整性 | 逐項掃描需求 | 確認需求本身沒有漏 |
| 可追溯性 | 整理來源與對照表 | 判斷來源是否可信 |
| 可使用性 | 檢查格式與操作步驟 | 請真人實際使用 |
| 人工修正成本 | 記錄錯誤與修改項目 | 評估時間是否真的省下 |
這張表讓我更確定:AI 很適合當第一層濾網,但不適合獨占最後一個印章。
請依驗收清單逐項檢查,每項只能標記「已驗證、合理推測、無法驗證」。已驗證必須附證據;合理推測要說明假設;無法驗證要列出需要人工確認的步驟。最後不要自行宣布整體完成。
這句「不要自行宣布整體完成」很重要。我要的不是一份充滿綠色勾勾的報告,而是一張真的能幫我找到風險的地圖。
AI 可以自己改考卷,但不能自己決定畢業。
最有效率的做法,是讓 ChatGPT 或 Codex 先處理可計算、可搜尋、可重複的檢查,再把需要情境、責任與真人感受的部分交回人手上。AI 負責把問題找快一點,人類負責決定這個答案能不能真的拿去用。
明天,我要繼續驗收另一個常被忽略的地方:AI 附了來源,就代表資料可靠嗎?
對了,剛剛漏講一招:不必每次都從頭人工重驗,可以先請 AI 標出「無法驗證」與「高風險」項目,再抽查其餘內容。省時間的關鍵不是少檢查,而是把人工留給最需要判斷的地方。
我參加過不少競賽後才發現,企畫排版整齊、章節齊全,只能算第一關。真正容易失分的往往是策略沒有接回題目,或數據看似合理卻支撐不了結論。這種判斷,我到現在都不敢只交給 AI 自己打勾。
如果只能選一項,你最不放心讓 AI 自己驗收什麼?是數據、引用來源、企畫邏輯、程式功能,還是文章公開後會不會被誤解?想看看大家心中的「人工必驗區」是不是一樣。
提供一些不同的方向
要讓不同的 AI 各司其職,精準處理不同類型的資料檢查,最有效的方法是建立「AI 代理路由(Agentic Routing)架構」,並針對每一條分支進行參數與上下文的微調。
你不應該用同一個大模型、同一套設定去處理所有事情,而是根據資料屬性進行分流與定制化。
不同資料類型需要指派給不同專長的 AI。這通常透過一個輕量級的「分類器(Router)」來分發任務,讓最合適的模型處理對應的資料:
資料分流後,必須透過以下三種方式「鎖緊」AI 的檢查標準,確保它符合你的驗收期待:
模型本身的隨機性必須受到嚴格控管。
0,讓輸出絕對一致、消除幻覺與隨機性。若要檢查「創意寫作」或給予「風格改寫建議」,則可微調至 0.3 - 0.5,讓 AI 能提出更有彈性的修改建議。AI 需要有對照標準,才能判斷對錯。
針對高風險的檢查(如期末考卷或正式合約),不應依賴單一 AI 的單次輸出。
謝謝補充,這個方向把文章中的「依風險分工」,進一步延伸成了系統化的模型路由。尤其是程式碼搭配沙盒實跑、文件用 RAG 對照最新規範,以及模型意見分歧時轉交人工,我很認同。
不過我會再保留兩道防線:Temperature 設為 0 可以降低隨機性,但不代表輸出一定完全一致,也不能直接消除幻覺;多個模型得出相同答案,也可能只是共享同一個盲點。因此我會把「模型共識」當成風險判斷訊號,而不是通過驗收的證明,最後仍要求附上資料來源、執行結果或可重現的檢查紀錄。
這也讓我想到,問題可能不只是「該用哪個 AI」,還包括「這項工作能用什麼證據驗證」以及「什麼情況必須轉交人工」。謝謝你提供這個不同方向,之後很適合再整理成一張「資料類型 × 驗證工具 × 人工介入條件」的對照表。